Aggregate benchmark scores obscure patient safety implications of errors across frontier language models
El estudio demuestra que las puntuaciones agregadas de los modelos de lenguaje avanzados ocultan diferencias clínicamente significativas en la seguridad de los pacientes, como sesgos contextuales y tasas variables de subtriage, lo que indica que la precisión general no es suficiente para evaluar ni predecir la seguridad clínica de estos sistemas.